Índice · Visión Computacional

Visión Computacional

Clase 3 · Aplicaciones de la visión computacional y la percepción visual humana

Fecha: 18 de agosto de 2026

Resumen de la clase

1 Contenido de la clase

Percepción remota: bandas, resolución y fusión [02:25-07:01]

Los satélites pasivos capturan la luz solar reflejada por la superficie con sensores de varias bandas espectrales: típicamente unas 7 bandas entre el infrarrojo y el ultravioleta [02:54], y existen sensores hiperespectrales con un centenar de bandas [03:00].

Principio físico: mientras más angosta sea la banda espectral que capta el sensor, menor es su resolución espacial [03:04]. Hay un balance entre la resolución espectral (ver el detalle de las bandas) y la resolución espacial (ver el detalle de la escena).

Para visualizar se combinan tres bandas y se presentan como canales RGB [03:23]; la banda pancromática, en cambio, es una sola banda con gran resolución espacial [03:36]. La fusión (pansharpening) usa la imagen pancromática para mejorar la resolución espacial de las multiespectrales, conservando su información espectral [04:23].

Otro tipo de fusión combina imágenes ópticas con sensores activos tipo radar (SAR): la onda electromagnética emitida rebota en la superficie y permite reconstruir la forma/morfología (como un ultrasonido) y atravesar las nubes, mientras las ópticas aportan las propiedades de reflectancia [05:06]. Ejemplo real: una alumna estimó el grado de marginación de zonas urbanas a partir de la textura de imágenes satelitales (zonas más construidas y amontonadas frente a zonas más dispersas) [06:06].

Puntos de interés, reconocimiento de objetos y localización [07:25-08:42]

Para relacionar dos imágenes (p. ej. de un producto visto en distintas tomas) se buscan características particulares: esquinas, bordes, "bolitas" (blobs), etc. [07:53]. Con la correspondencia de esos puntos de interés (y sus descriptores) se logra el reconocimiento de objetos [08:03]. Ejemplo de localización: un robot con un mapa describe un lugar (un edificio) con un conjunto pequeño de características; al reconocerlo, sabe en qué parte del espacio está [08:18].

Flujo óptico y codificación de video [08:48-20:35]

Con dos frames consecutivos se puede estimar el movimiento de los objetos o de toda la escena: el flujo óptico [08:54]. Ejemplo: partido de fútbol con la cámara en panorámica; casi todo el movimiento es horizontal y el mapa de flujo permite interpretar toda la escena [09:02].

En codificación de video, si se transmite todo el video por un canal de ancho de banda limitado aparecen muchos errores; los codificadores usados en televisión detectan la figura principal (la pelota o el jugador) y codifican esa zona con más calidad [20:00].

Estimación de profundidad (visión estéreo) [20:36-21:44]

Con dos cámaras (como los dos ojos), un objeto cercano aparece en una posición distinta en cada cámara (disparidad), mientras que uno lejano aparece casi igual en ambas [21:00]. Esa disparidad permite estimar la profundidad. Con una sola cámara hay que moverla, tomar otra foto y calcular la disparidad, lo que cuesta más trabajo [21:18].

Imagen médica: el corazón [21:44-23:44]

En un ecocardiograma se captura el video del corazón y se analiza el movimiento de sus paredes, en particular del ventrículo izquierdo [22:06]. Se dibujan vectores (flechas) sobre su contorno: la dirección indica hacia dónde se mueve cada parte y el tamaño, la intensidad del movimiento [22:39]. Es la combinación de segmentación del ventrículo + análisis/estimación de movimiento [23:06].

Utilidad: se construye un patrón de corazón sano (vectores robustos); si hay isquemia, los vectores son más pequeños y débiles, lo que permite el diagnóstico por reconocimiento de patrones [23:18]. En niños se requiere sedación para que permanezcan quietos [22:20].

Biometría: reconocimiento de iris [23:57-29:45]

El iris es el rasgo biométrico más preciso (más que la huella digital), porque su textura es única por persona [24:05]. Proceso: localizar el ojo, aislar la región del iris (quitar párpados y esquinas), normalizar la textura y generar el código de iris [24:27]. El modelo original es de John Daugman, que representó el iris con matemáticas (círculos) y propuso el código [25:51].

El código es muy compacto: la imagen original ocupa del orden de 512×512 píxeles (≈2 millones de bits) y el código se puede representar en el orden de 128 bits [26:33]. Se compara con la distancia de Hamming: una distancia muy pequeña indica la misma persona [27:22]. El método debe distinguir irises distintos pero tolerar el mismo iris capturado en condiciones ligeramente diferentes [26:53]. La captura se hace con luz controlada (infrarrojo, que resalta tejidos) y hace falta normalizar para que funcione aunque el iris se tome con dispositivos distintos [28:22].

Breve mención: en reconocimiento facial se usan puntos característicos (cejas, nariz, narinas, etc.) que se conectan entre sí [28:50].

Marcas de agua [40:00-41:45]

Insertar información invisible en una imagen propia para protegerla, sin dañar la calidad visible [40:10]. Son marcas "perceptivas": se insertan donde el ojo humano es menos sensible a los cambios, usando un modelo de percepción visual [40:48]. Si se compara la imagen marcada con la original, la diferencia revela los puntos donde se insertó [40:30].

Robustez: los atacantes comprimen (JPEG), recortan o manipulan la imagen para romper la marca; por eso la marca debe ser robusta, y su estudio es una línea de investigación activa [41:22].

Citas y referencias bibliográficas [43:25-44:48]

Se pide adoptar un estándar de referencias bibliográficas en cualquier documento que se entregue (no importa cuál, pero sustentarlo) [43:29]. Consejo: no abusar de las citas electrónicas: internet es poco confiable; si se consulta una revista en línea, se cita la revista, no la página web [44:00]. En la tesis se verá mal usar citas de este tipo [44:20].

La luz y la percepción [45:25-49:15]

Un objeto iluminado transmite una parte de la luz, absorbe otra y refleja otra; lo que percibimos es la parte reflejada [45:29]. En otras modalidades, los rayos X "ven" la absorción y el ultrasonido, las propiedades acústicas (transmisión) [45:55].

La candela y el lumen se miden con instrumentos (cantidad objetiva); la brillantez es la cantidad subjetiva que reporta el humano [46:34]. La relación entre la intensidad (objetiva) y la brillantez percibida es logarítmica (ley de Weber-Fechner) [47:03].

El ojo opera en un rango dinámico gigantesco (de ~10⁻⁶ a ~10⁴), que ningún dispositivo artificial alcanza [47:14]. La adaptación a la oscuridad puede tardar hasta 30 minutos y en la oscuridad vemos en blanco y negro [47:53].

Hay dos tipos de visión: fotópica (conos, a color, necesita luz) y escotópica (bastones, sin color, poca luz) [48:12]. Al bajar la luz, el primer color que se ve es el azul y el último el rojo; por eso las luces de emergencia y de freno son rojas [49:19].

El ojo, la retina y el análisis multirresolución [60:25-65:30]

La luz entra por la córnea, la enfoca el cristalino (que los músculos ciliares estiran para enfocar cerca o lejos) y llega a la retina, donde están los conos y bastones [60:30]; el punto ciego es por donde salen los nervios y la vasculatura [61:16]. La retina es "invertida": los fotorreceptores están al fondo, apuntando a la membrana; la luz los atraviesa de todos modos [61:30].

Vía de señal: fotorreceptores → células bipolares → células ganglionares → nervio óptico, con una compresión de aproximadamente 8:1 (menos fibras en el nervio óptico que fotorreceptores) [62:37].

Campos receptivos: los sensores que caen dentro de un campo contribuyen a una misma célula, y un sensor puede participar en varios campos [63:11]. En la fóvea los campos son pequeños (alta resolución); hacia la periferia son más grandes (baja resolución) [63:48]. La contribución no es uniforme: lo que cae en el centro pesa más que lo de los bordes, como una función gaussiana (operación de correlación) [64:44].

El análisis multirresolución: la visión humana procesa en varios canales de resolución; la visión computacional (y las pirámides y codificadores de TV) copió esta idea, formalizada a finales de los 80 (Stéphane Mallat, 1989) y que después dio paso al deep learning [64:20].

2 Puntos destacados / Lo que hay que saber

En teledetección hay un balance físico: más resolución espectral = menos resolución espacial [03:04].
Pansharpening: fusionar la banda pancromática (alta resolución espacial) con las multiespectrales (alta resolución espectral) [04:23].
Los sensores activos (radar/SAR) atraviesan las nubes y reconstruyen la forma; se fusionan con imágenes ópticas [05:06].
El flujo óptico (con 2 frames) estima el movimiento de la escena; la codificación de video prioriza la figura principal [08:54].
Con dos cámaras, la disparidad de un objeto cercano permite estimar profundidad [21:00].
Ecocardiografía: segmentación del ventrículo izquierdo + vectores de movimiento; isquemia = vectores más débiles [23:18].
El iris es el biométrico más preciso; el código de iris es muy compacto y se compara con la distancia de Hamming (Daugman) [27:22].
Las marcas de agua perceptivas se insertan donde el ojo es menos sensible; deben resistir compresión, recorte y manipulación [40:48].
Citar con un estándar y evitar las citas de páginas web (internet poco confiable) [44:00].
La intensidad es objetiva; la brillantez es subjetiva y su relación es logarítmica (Weber-Fechner) [47:03].
Visión fotópica (conos, color) vs escotópica (bastones, B/N); en la penumbra primero se ve el azul y el último el rojo [49:19].
La retina es invertida; la vía retina→nervio óptico comprime ~8:1 [62:37].
Campos receptivos: en la fóvea son pequeños (alta resolución); en la periferia grandes; ponderación tipo gaussiana [63:48].
El análisis multirresolución (finales de los 80) copia a la visión humana y da paso al deep learning [64:20].

3 Actividades y tareas pendientes

Tareas y compromisos mencionados en esta clase (marcá lo que ya cumpliste):

No se mencionaron fechas concretas de entrega en esta clase.

4 Dudas que podrían examinar

¿Qué es el pansharpening?

Fusionar la imagen pancromática (alta resolución espacial) con las multiespectrales (alta resolución espectral) para obtener una imagen con ambos tipos de detalle, sin perder información espectral.

¿Por qué los sensores activos atraviesan las nubes?

Porque emiten su propia onda electromagnética (radar/SAR), que no depende de la luz solar reflejada; miden el rebote de la onda y por eso reconstruyen la forma/morfología incluso con nubosidad.

¿Qué es el flujo óptico?

El campo de movimiento que se estima comparando dos frames consecutivos. Sirve para entender el movimiento de la cámara y de los objetos de la escena (ej.: en un partido con panorámica, todo se mueve horizontal).

¿Cómo se estima la profundidad con dos cámaras?

Por la disparidad: un objeto cercano se proyecta en posiciones distintas en cada imagen, mientras que uno lejano aparece casi en la misma posición; esa diferencia de posición permite calcular la profundidad.

¿Por qué la ecocardiografía permite detectar isquemia?

Porque la isquemia debilita el movimiento de la pared del ventrículo. Comparando los vectores de movimiento del corazón con un patrón de corazón sano, los vectores del enfermo son más pequeños y débiles.

¿Por qué el iris es un biométrico tan preciso?

Porque la textura del iris es única por persona y permanece estable; además, el código de iris permite comparaciones muy compactas y confiables (más exactas que la huella digital).

¿Cómo se comparan dos códigos de iris?

Con la distancia de Hamming: una distancia muy pequeña indica que los códigos vienen de la misma persona; el método debe distinguir irises distintos pero tolerar el mismo iris captado en condiciones ligeramente diferentes.

¿Qué es una marca de agua perceptiva?

Una marca invisible que se inserta en las zonas donde el ojo es menos sensible (usando un modelo de percepción visual), de modo que no degrada la imagen y puede extraerse para probar el origen.

¿Qué diferencia hay entre visión fotópica y escotópica?

La fotópica usa los conos, requiere luz y da color; la escotópica usa los bastones, funciona con poca luz y es en blanco y negro. Al bajar la luz, el primer color que se ve es el azul y el último el rojo.

¿Por qué los campos receptivos de la fóvea dan alta resolución?

Porque son pequeños: cada célula recibe información de pocos sensores. En la periferia los campos son grandes, integran mucha información y no resuelven detalles finos.

¿Qué es el análisis multirresolución?

Procesar la imagen en varios canales de resolución a la vez, igual que hace la visión humana. Se formalizó a finales de los 80 (Mallat, 1989) y dio base a las pirámides, los codificadores de TV y el deep learning.

5 Sitios o recursos para visitar

  • Pansharpening — Fusión pancromática-multiespectral en percepción remota (dominio: es.wikipedia.org).
  • Teledetección — Bandas espectrales, sensores hiperespectrales y radar/SAR (dominio: es.wikipedia.org).
  • Reconocimiento de iris — El método de John Daugman y el código de iris (dominio: es.wikipedia.org).
  • Distancia de Hamming — La métrica con la que se comparan los códigos de iris (dominio: es.wikipedia.org).
  • Flujo óptico — Estimación de movimiento entre frames (dominio: es.wikipedia.org).
  • Visión estéreo — Disparidad y estimación de profundidad con dos cámaras (dominio: es.wikipedia.org).
  • Fotorreceptores: conos y bastones — Visión fotópica y escotópica (dominio: es.wikipedia.org).
  • Ley de Weber-Fechner — La relación logarítmica entre la intensidad y la percepción (dominio: es.wikipedia.org).
  • Campo receptivo — Cómo se organizan los sensores de la retina (dominio: es.wikipedia.org).
  • Análisis multirresolución — La teoría formalizada por Stéphane Mallat (1989) (dominio: es.wikipedia.org).
  • Marca de agua digital — Protección de imágenes con marcas invisibles (dominio: es.wikipedia.org).

6 Glosario de términos

  • Percepción remota / teledetección: análisis de la Tierra con sensores a distancia (satélites).
  • Banda espectral: rango estrecho del espectro electromagnético que capta un sensor.
  • Resolución espectral: qué tan angosta es la banda que capta el sensor.
  • Resolución espacial: cuánto detalle de la escena puede resolver el sensor.
  • Banda pancromática: banda única que ve todo el espectro visible y da gran resolución espacial.
  • Pansharpening: fusión de la pancromática con las multiespectrales para ganar resolución espacial sin perder espectral.
  • SAR / satélite activo: sensor que emite su propia onda electromagnética y mide el rebote; atraviesa las nubes.
  • Puntos de interés / descriptores: características particulares (esquinas, blobs) que permiten encontrar correspondencias entre imágenes.
  • Flujo óptico: campo de movimiento estimado entre dos frames consecutivos.
  • Disparidad: diferencia de posición de un objeto entre las dos imágenes de un par estéreo; permite estimar profundidad.
  • Ecocardiograma: video del corazón (ultrasonido) con el que se analiza el movimiento de las paredes.
  • Isquemia: falta de riego sanguíneo del músculo cardíaco; debilita el movimiento del ventrículo.
  • Biometría: identificación de personas por rasgos físicos (huella, iris, cara, etc.).
  • Código de iris: representación binaria muy compacta de la textura del iris (Daugman).
  • Distancia de Hamming: número de bits en que difieren dos códigos; distancias pequeñas = misma persona.
  • Marca de agua perceptiva: marca invisible insertada donde el ojo es menos sensible, usando un modelo de percepción visual.
  • Brillantez: percepción subjetiva de cuán brillante es un objeto.
  • Intensidad / radiancia: cantidad objetiva de luz medida con un instrumento (candela, lumen).
  • Ley de Weber-Fechner: la percepción crece logarítmicamente con la intensidad del estímulo.
  • Visión fotópica: visión a color con los conos; requiere luz.
  • Visión escotópica: visión en blanco y negro con los bastones; funciona con poca luz.
  • Córnea: capa exterior del ojo por donde entra la luz.
  • Cristalino: lente del ojo que enfoca; los músculos ciliares la estiran para acomodar.
  • Retina: capa del fondo del ojo donde están los conos y bastones.
  • Punto ciego: zona de la retina por donde salen los nervios y la vasculatura; no tiene fotorreceptores.
  • Retina invertida: los fotorreceptores apuntan al fondo; la luz los atraviesa.
  • Campo receptivo: zona de la retina que contribuye a una célula; pequeño en la fóvea (alta resolución), grande en la periferia.
  • Fóvea: centro de la retina con los campos receptivos más finos.
  • Análisis multirresolución: procesar la imagen en varios canales de resolución; formalizado a finales de los 80 (Mallat).

7 Mapa mental textual

  • Visión Computacional — Clase 3 (Aplicaciones y percepción humana)
    • Percepción remota: satélites pasivos (bandas espectrales, hiperespectrales, pancromática)
      • Balance: más resolución espectral → menos espacial
      • Fusiones: pansharpening · óptico + radar/SAR
      • Aplicación: grado de marginación urbana por textura
    • Análisis de imágenes: puntos de interés → correspondencia → reconocimiento de objetos
      • Localización de robots con mapas de características
      • Flujo óptico (2 frames) · codificación de video (prioriza figura principal)
      • Visión estéreo: disparidad → profundidad
    • Imagen médica: ecocardiograma → segmentación del ventrículo izquierdo + vectores de movimiento
      • Patrón sano vs isquémico (vectores débiles)
    • Biometría: iris = biométrico más preciso (Daugman)
      • Aislar iris → normalizar → código de iris (compacto) → distancia de Hamming
      • Iluminación infrarroja + normalización entre sistemas
      • Rostro: puntos característicos conectados
    • Marcas de agua: perceptivas (modelo de percepción visual) y robustas (JPEG, recorte, manipulación)
    • Citas: adoptar estándar; evitar citas de páginas web
    • Luz y percepción: transmitir/absorber/reflejar · candela/lumen (objetivo) vs brillantez (subjetivo)
      • Relación logarítmica (Weber-Fechner) · rango dinámico gigante · adaptación 30 min
      • Fotópica (conos, color) vs escotópica (bastones, B/N): azul primero, rojo último
    • Ojo y retina: córnea → cristalino → retina (conos/bastones) → punto ciego
      • Retina invertida · fotorreceptores → bipolares → ganglionares → nervio óptico (compresión 8:1)
      • Campos receptivos: fóvea finos (alta resolución), periferia gruesos; ponderación gaussiana
      • Análisis multirresolución (finales de los 80) → pirámides → deep learning

Notas de estudio